1
コンピュータビジョンとデジタル画像処理入門
PolyU COMP5511Lecture 8
00:00

コンピュータビジョンとデジタル画像処理入門

コンピュータビジョン は、デジタル画像や動画から意味のある情報を引き出すことを可能にする人工知能の分野であり、最終的には セマンティックギャップ を埋めることを目指しています。 デジタル画像処理 は、コンピュータビジョンの基盤となる層として機能し、ピクセル単位の変換を通じて画像信号の操作・強調に焦点を当て、より高次の解釈タスクに備えてデータを整えます。

主要な原則

  • データ表現: 機械レベルでは、画像は総合的な絵ではなく、数値の テンソル です。グレースケール画像は輝度値の2次元行列ですが、カラー画像は赤・緑・青(RGB)チャネルを表す次元が $H \times W \times 3$ の3次元テンソルです。
  • 変換と解釈: デジタル画像処理は主にノイズ除去、シャープネス処理、ヒストグラム平坦化などの画像から画像への操作を扱います。一方、コンピュータビジョンは物体分類、位置特定、セグメンテーションなどの画像から知識への操作に焦点を当てます。
  • 逆グラフィックスのパラダイム: コンピュータビジョンはコンピュータグラフィックスの逆と見なすことができます。グラフィックスが数学的モデルから視覚的な世界を生成するのに対し、ビジョンは2次元投影から3次元構造と意味的ラベルを復元しようとします。
中核となる課題
この分野における主要な課題は セマンティックギャップです。これは、機械が処理する低レベルのピクセル値と、人間が知覚する高レベルの概念との間の断絶です。
Python実装
質問1
画像から知識への操作に分類されるプロセスはどれですか?
デジタル画像処理
コンピュータビジョン
コンピュータグラフィックス
ヒストグラム平坦化
質問2
機械レベルで、標準的なカラー画像のデータ構造は次のうちどれですか?
2次元行列
1次元配列
3次元テンソル / RGBチャネル
連結リスト
ケーススタディ:医療診断システム
以下のシナリオを読んで質問に答えてください。
ある病院が、X線スキャンを解析して潜在的な骨折を検出する新しい自動医療診断システムを開発しています。このシステムはX線装置からの生のセンサーデータを処理し、放射線科医向けの診断レポートを出力します。
Q
1. 骨構造をより明確にするためにシステムがコントラスト強調を適用する場合、これはデジタル画像処理(DIP)ですか、それともコンピュータビジョン(CV)ですか?
解答:
デジタル画像処理です。コントラスト強調は、意味的な内容を抽出せずに信号の視覚的な品質を向上させる画像から画像への変換です。
Q
2. システムが特定の領域を骨折の可能性があると自動的にフラグ付けする場合、それはどのタスクを実行していますか?
解答:
コンピュータビジョン / 物体検出です。システムは画像の内容を解釈して高レベルの知識(骨折の位置特定)を抽出しています。
Q
3. 検出アルゴリズムを実行する前にノイズ除去が必要なのはなぜですか?
解答:
意味解釈の段階で信号品質を向上させ、誤検出(偽陽性)を減らすためです。ノイズはCVアルゴリズムによって実際の特徴やエッジと誤解釈される可能性があります。